跳到主要内容

OpenClaw 摄像头应用教程

开始前请先完成 使用前准备 目录下的 [01-外设硬件配置]、[02-openclaw Ajetson-KEY配置]、[03-openclaw切换模型]、[04-AI语音交互配置]、[05-三种对话方案配置测试]。本文默认基础环境已经准备完成,只展开摄像头相关内容。

1. 教程目标

本文通过 CSI 摄像头外设展示 OpenClaw 的自然语言控制能力。完成本教程后,读者可以:

  • 了解 OpenClaw 使用摄像头进行拍照和视觉分析的基本思路

  • 通过飞书、TUI、语音代码三种方式和 OpenClaw 对话

  • 完成四个摄像头案例:拍照留档、场景描述、OCR 识别、目标定位与人脸检测

  • 理解从“用户提出视觉任务”到“图片采集”和“结果返回”的完整链路

2. 硬件准备

  • OpenClaw 主控板

  • CSI 摄像头模块

  • 摄像头排线

  • [可选] 麦克风模块

  • 接线图

image-20260601101822137

3. 软件准备

国内版本:

如果使用的是飞书,要将图片直接上传到飞书,要将你新建的飞书对话ID,填入下面路径的chat_id

/home/jetson/.openclaw/openclaw.json

  • 打开飞书对话框,点击右上角的三个点

image-20260429193249934

  • 点击了之后拉到最下面,可以看到会话ID,点击复制

image-20260429193332170

  • 在配置文件里将"chat_id": 改成你自己的会话ID

image-20260610114023105

改完之后,"appSecret": "nTAnX30VPsRlrBgPA95YthpYxafgLx35", 这里面的内容可以到这个路径下复制过来,

xxxxxxxxxx /home/jetson/.openclaw/credentials/lark.secrets.json

image-20260610113934742

  • 终端输入下面指令生效

xxxxxxxxxx openclaw gateway restart

国际版本:

如果使用的是WHATSAPP,要将图片直接上传到whatsapp,要将你新建的whatsapp对话ID,填入下面路径的"allowFrom"

  • 打开你新建的whatsapp对话就能看到对话ID

image-20260429193615898

  • 将这个填入"allowFrom":

image-20260429193515227

  • 终端输入下面指令生效

xxxxxxxxxx openclaw gateway restart

4. 测试摄像头应用

开始当前教程前,请先完成一次 openclaw tui 基础对话自检;如果还没做,先看 [05-三种对话方案配置测试]。另外请确认视觉模型已经配置完成,可参考 [02-openclaw Ajetson-KEY配置] 和 [03-openclaw切换模型]。通过后,再进入摄像头专项测试。

终端输入以下命令进入 TUI:

xxxxxxxxxx openclaw tui

image-20260529192823501

终端可以尝试输入下面内容:

  • 帮我拍一张照片

  • 识别一下这张图里的文字

image-20260529192917157

  • 找一下画面里的杯子(因为模型会联系上下文,要提醒它重新拍摄,不然它可能会采用第一张照片)

image-20260529193241659

  • 重新拍一张照片,把里面的文字整理成表格

image-20260529193352617

5. 和 OpenClaw 对话的三种方案

方案适合场景优点建议定位
飞书远程控制、课堂演示接入方便,适合多人体验展示“远程自然语言控制”
TUI本地调试、命令验证最直接、最容易排错先跑通视觉链路
语音代码语音交互、完整 AI 体验最贴近真实对话体验作为最终演示方案

如果选配了AI语音模块+扬声器,飞书对话、tui、whatsapp对话需要播报openclaw回复的内容,可以终端运行下面的程序,ai语音模块对话不需要重复运行

  • 修改是否打开播报参数

xxxxxxxxxx /home/jetson/voice_to_openclaw/.env xxxxxxxxxx ENABLE_TTS = true #这个参数就是控制是否播报,修改完保存,终端运行下面程序

  • 终端输入

xxxxxxxxxx cd ~/ voice_to_openclaw source . venv / bin / activate python \- m src . openclaw_session_tts

image-20260529193417657

5.1 飞书方案

飞书接入步骤请直接参考 [05-三种对话方案配置测试],本节只保留适合摄像头教程的对话示例。

打开飞书后,通常也能看到前面用 openclaw tui 触发的照片和识别结果同步过来。

image-20260427191454322

可以重新直接对话,例如:

  • 看一下前面是什么

  • 识别一下图片里的文字

image-20260427192023711

5.2 TUI 方案

如果已经完成第 0 篇中的 TUI 自检,直接在终端输入下面命令即可继续对话:

xxxxxxxxxx openclaw tui

然后就可以直接输入摄像头相关指令,例如:

  • 拍一张当前画面

  • 描述一下镜头里的场景

  • 检测一下有没有人脸

这里可以自行添加 TUI 对话截图。

5.3 语音代码方案

xxxxxxxxxx 需要选配 ai 语音交互模块 + 扬声器

语音模块安装、环境配置和基础唤醒流程请直接参考 [04-AI语音交互配置]。唤醒之后,可以直接说出控制内容,例如:

  • 帮我拍一张照片

  • 看一下前面有什么

  • 帮我读一下画面里的文字

这里可以自行添加语音唤醒和语音控制截图。

6. 综合案例

注意:下面都是在 openclaw tui 方式进行对话演示,你也可以自己选择飞书或语音方式来完成。

6.1 案例一:拍照留档

实验目标

让 OpenClaw 先完成最基础的拍照功能,并把图片保存下来。

效果说明

执行后会在本地生成一张照片,通常同时保留本次拍照文件和 latest.jpg 最近一次照片别名。这个案例适合用来验证采图链路。

示例指令

  • 帮我拍一张照片

  • 拍下当前画面

  • 现在拍一张留作记录

6.2 案例二:场景描述

实验目标

让 OpenClaw 在拍照之后,对当前画面进行简短描述。

效果说明

OpenClaw 可以先完成拍照,再调用视觉分析脚本对图片内容做一句话描述,比如识别桌面、人物、食物或常见物体。

示例指令

  • 看看前面有什么

  • 帮我描述一下当前画面

  • 拍照后告诉我镜头里主要是什么

6.3 案例三:OCR 表格识别

实验目标

让 OpenClaw 识别图片中的文字整理成表格。

效果说明

这个案例适合拍摄标签、卡片、包装或简单文档,然后把文字提取出来。既可以输出普通文本,也可以继续整理成表格。

示例指令

  • 识别这张图里的文字

  • 拍照后把文字整理成表格

  • 找一下画面里的杯子

  • 看看有没有人脸

  • 帮我定位桌面右边的手机